选 AI 盒子跑大模型,注意力全在 NPU 算力和内存上——算力看 TOPS、内存看容量,选了半天觉得差不多了。机器到手部署,发现模型加载慢、多任务卡顿、推理时延不稳定。查了一圈,问题出在 CPU 上:核心数不够,数据搬运跟不上 NPU 的消耗速度。
大模型推理不是“NPU 一个人干所有活”——CPU 负责调度、数据搬运、预处理和后处理,这些环节慢了,NPU 再强也要空等。帮你搞清楚 部署大模型对 AI 盒子 CPU 的真实要求,并提供可执行的选型标准。
很多人以为大模型推理全靠 NPU/GPU,CPU 只是“跑系统”的配角。实际上,一次完整的大模型推理,CPU 至少要承担以下工作:
| 环节 | CPU 负责的工作 | 占总时间比例 |
|---|---|---|
| 模型加载 | 从存储读取模型文件到内存 | 5%~10%(首次加载) |
| 输入预处理 | Tokenization(文本转 Token)、数据格式转换 | 5%~10%(每轮对话) |
| 推理调度 | 将计算任务分配给 NPU/GPU,协调数据流 | 3%~5%(每轮对话) |
| 输出后处理 | Detokenization(Token 转文本)、结果格式化 | 5%~10%(每轮对话) |
| 多任务并发 | 同时处理多个推理请求的排队与调度 | 影响显著 |
| 日志与监控 | 记录推理过程、上报状态 | 持续后台运行 |
关键认知:NPU 负责“算”,CPU 负责“搬”和“调度”。算得再快,如果数据搬不过来、调度不过来,整体速度照样上不去。
典型配置:ARM 架构(4×A72 + 4×A53,如 PB0601/PB0801)
| 需求维度 | 要求 | 说明 |
|---|---|---|
| 核心数 | 4~8 核 | 单路推理 4 核足够,8 核更从容 |
| 单核性能 | 中等(A72/A76 级别) | 主要做文本处理,不重 |
| 多核性能 | 中等 | 预处理和后处理可并行 |
| 实际表现 | 8 核 ARM 满足需求 | 推理速度 8~12 token/s 时 CPU 占用 <50% |
轻量推理场景,主流 ARM 盒子的 8 核 CPU 完全够用,CPU 不是瓶颈。
典型配置:x86 架构(4~8 核,如 PB1001/PB1202/PB1301)
| 需求维度 | 要求 | 说明 |
|---|---|---|
| 核心数 | 6~8 核 | 多路并发或 RAG 检索需要更多核心 |
| 单核性能 | 较高 | Tokenization 是串行操作,单核性能影响首 Token 延迟 |
| 多核性能 | 较高 | 多路请求可并行处理 |
| 实际表现 | 6 核 x86 满足需求 | RAG 场景下 CPU 用于检索和重排序 |
RAG 场景,6 核 x86 CPU 满足需求。如有多路并发(同时处理 2~4 路推理),建议 8 核以上。
典型配置:高性能 x86(8~16 核,如 PB1501)
| 需求维度 | 要求 | 说明 |
|---|---|---|
| 核心数 | 8~16 核 | 多路并发 + 复杂处理需要更多核心 |
| 单核性能 | 高 | 影响整体响应速度 |
| 多核性能 | 高 | 多任务并行处理 |
| 实际表现 | 16 核满足高负载需求 | 70B 模型推理时 CPU 用于数据搬运和调度 |
高负载场景,8~16 核高性能 x86 CPU 是刚需。
| 问题 | 表现 | 原因 |
|---|---|---|
| 首 Token 延迟高 | 提问后等待 3~5 秒才有回复 | CPU Tokenization 慢(单核性能不足) |
| 多路推理互相干扰 | 2 路同时推理时速度明显下降 | CPU 核心数不够,任务排队 |
| NPU 利用率低 | NPU 跑不满,推理速度上不去 | CPU 数据搬运跟不上 NPU 消耗 |
| 系统卡顿 | 推理时 SSH 响应慢、日志延迟 | CPU 被推理任务占满 |
| 使用场景 | 推荐 CPU 架构 | 推荐核心数 | 推荐型号 | 说明 |
|---|---|---|---|---|
| 单路 7B 推理(边缘部署) | ARM(A72/A76) | 8 核 | PB0601/PB0801 | 8 核 ARM 足够,功耗低 |
| 单路 7B 推理(桌面开发) | x86 | 4~6 核 | PB1001 | 4 核 x86 够用,兼顾办公 |
| 多路并发 / RAG | x86 | 6~8 核 | PB1202/PB1301 | 6~8 核 x86 从容应对 |
| 13B+ 模型 / 高负载 | x86(高性能) | 8~16 核 | PB1501(16 核 32 线程) | 旗舰配置,性能天花板 |
A:不完全是。 大模型推理中,CPU 核心数影响多路并发能力,但单核性能影响 Tokenization 的响应速度。对于单路推理,4~8 核足够;对于多路并发(同时处理 2 路以上),建议 8 核以上。
A:够用,但有上限。 对于单路 7B 推理,8 核 ARM CPU(如 RK3588 的 4×A76 + 4×A55)完全够用。但如果需要跑多路并发或 RAG,x86 CPU 的多核性能和软件生态更有优势。
A:会。 模型加载时,CPU 负责从存储读取数据并写入内存,这个过程主要受存储速度影响,但 CPU 的解压和校验也会占用一定时间。建议搭配高速存储(SSD)以减少加载时间。
A:看具体型号。 高端 x86 CPU(如 AMD Ryzen AI 7 350)单核性能显著强于 ARM(如 RK3588),适合需要快速响应和复杂预处理的场景。但 ARM CPU 的功耗优势明显(10W vs 28W+),适合边缘部署场景。
CPU 选对了,NPU 才不会空等。